Видео с ютуба Moe Inference
A Visual Guide to Mixture of Experts (MoE) in LLMs
New Local AI Inference Engine You Should Be Using in 2027 ? (FreeToken)
Fast Inference of Mixture-of-Experts Language Models with Offloading
What is Mixture of Experts?
Mixture of Experts (MoE), Visually Explained
API PyTorch для высокопроизводительного обучения и вывода MoE — Д. Вега-Мюре, Ке Вэнь и Н. Гимель...
1 миллион крошечных экспертов в одном ИИ? Разбор гранулярных MoE
NSDI '26 - SwiftEP: Accelerating MoE Inference with Buffer Fusion and TMA Offloading
Оптимизация больших вычислительных уровней MoE на NVIDIA Blackwell: NVFP4, ADP и DualPipe Strat.....
Stop One-Shotting MoE Models - Why They Fail and What Works
Оптимизация вывода LLM №2: тензорный, экспертный и экспертный параллелизм (TP, DP, EP, MoE)
Что такое модели смешанного экспертного анализа | с участием Аритры
Stanford CS336 Language Modeling from Scratch | Spring 2025 | Lecture 4: Mixture of experts
PyTorch Day India 2026 Оптимизация вывода MoE на NVIDIA Blackwell с помощью vLLM и NVFP4 Прасад Муке
Staleness-Centric Optimizations for Parallel Diffusion MoE Inference (ICCV 2025 Paper)
Ошибки, связанные с численным равенством в обучении и выводе MoE.
Mixture of Experts (MoE) Introduction
[2024 Best AI Paper] Fast Inference of Mixture-of-Experts Language Models with Offloading
Освоение оптимизации вывода LLM: от теории до экономически эффективного внедрения: Марк Мойу
AI Hardware: Training, Inference, Devices and Model Optimization